Índice · Visión Computacional

Visión Computacional

Clase 8 · Modelo de cámara, coordenadas homogéneas y homografía

Fecha: 22 de septiembre de 2026

Resumen de la clase

1 Contenido de la clase

Modelo de cámara y proporcionalidad [00:00-01:23]

La clase arranca con el modelo de cámara más sencillo: la relación entre la distancia de la cámara al objeto y la distancia focal se explica con proporcionalidad (triángulos semejantes) [00:00-00:22]. Todo es proporcional: comparando la distancia al objeto con la distancia al foco se obtiene un factor de escala [00:53-00:59]. El profesor da un ejemplo numérico de proporción (p. ej. 5:2) entre las distancias [01:03-01:19]. [parte no entendida — el detalle del ejemplo con las cifras exactas no se distingue en la grabación].

Aplicación: reconstruir una escena desde muchas fotos [01:23-02:13]

Como motivación se plantea el problema de relacionar vistas de un mismo objeto: personas tomando muchas fotos del Coliseo romano desde puntos distintos; entre todas las tomas siempre hay una relación geométrica entre lo capturado desde cada posición [01:53-02:13].

Coordenadas homogéneas [02:22-04:16]

Para trabajar el modelo de cámara se pasan las coordenadas reales (cartesianas) a coordenadas homogéneas: consiste en agregar una coordenada más al punto [02:22-02:34], típicamente w = 1 [02:55-03:02]. Para regresar a cartesianas se divide entre w: x/w, y/w [02:47-02:53]. La propiedad clave es la invarianza a escala: si se multiplican todas las coordenadas por una misma constante se obtiene el mismo punto [03:21-03:27, 04:05-04:12], y para recuperar el original basta dividir por esa constante [03:48-04:04].

El modelo de cámara pinhole y sus suposiciones [04:20-06:45]

Hay muchos modelos de cámara; el más sencillo es el pinhole (estenopeico) [04:20-04:30]. La idea es una transformación que relaciona las coordenadas del mundo 3D con las coordenadas de la imagen 2D, combinando una matriz intrínseca, una matriz de rotación y una matriz de proyección [04:30-05:03]. Se asumen varias suposiciones iniciales [05:05-05:09]:

  • Radio de aspecto (aspect ratio) = 1: la focal en dirección X es igual a la de dirección Y (píxeles cuadrados) [05:11-05:17, 06:22-06:24]. En televisión los formatos son 16:9 o 4:3, pero aquí se asume proporción 1 [05:19-05:27].
  • El centro óptico está en la coordenada (0,0) [06:28-06:30].
  • No hay desplazamientos ni rotaciones de la cámara; la cámara está en el origen [06:31-06:45].

Todo se convierte en una multiplicación de matrices [07:23-09:18]

La utilidad de las coordenadas homogéneas es que las traslaciones (izquierda, derecha, arriba, abajo), que con coordenadas cartesianas requieren una suma, pasan a ser una multiplicación [07:23-07:39, 08:36-08:46]. Por ejemplo, una relación en dirección Z que antes era suma se convierte en multiplicación [08:23-08:36]. Así, todo el cambio de modelo (mundo → cámara → imagen) se expresa como una matriz que multiplica las coordenadas, sin sumas [08:44-09:18]. [parte no entendida — el ejemplo concreto de la ecuación que escribía el profesor no se distingue en la grabación].

Parámetros intrínsecos y extrínsecos de la cámara [21:00-22:35]

Retomando el modelo de cámara: la relación entre la cámara y las coordenadas de la imagen se convierte en una multiplicación de matrices, y las coordenadas de la imagen (u, v) salen del vector con w = 1 [21:03-21:24]. Luego está la rotación: la cámara puede rotar en 3 ángulos (alfa, beta y gamma), y las rotaciones en los 3 ejes del mundo se combinan en una sola matriz de rotación 3×3 [21:27-22:05]. El problema completo considera parámetros intrínsecos (foco, cambio de escala, sesgo/skew, coordenadas del centro de la imagen) y parámetros extrínsecos (posición de la cámara en el mundo) [22:09-22:23]. En total: 5 intrínsecos [22:23-22:25] y 6 extrínsecos (3 rotaciones + 3 traslaciones: los grados de libertad de la cámara) [22:25-22:35].

Calibración de la cámara y correcciones por lente [23:36-24:42]

El objetivo es conocer los parámetros de la cámara, ya sea analíticamente o experimentalmente: se ponen muchos puntos conocidos en la pared (un patrón de calibración), se toma la imagen, se comparan las posiciones esperadas con las proyectadas y se ajusta la matriz [23:55-24:11]. Además, el modelo pinhole no considera lentes: si la cámara usa un angular o un teleobjetivo, hay que corregir las distorsiones [24:18-24:42].

Transformación proyectiva: el cuadrado que se vuelve trapecio [25:05-26:19]

Con dos vistas de una escena (un plano), no hay profundidad (no hay coordenada Z del mundo real) [25:07-25:21]. El ejemplo clásico: un satélite que toma una imagen lejana de la Tierra; un cuadrado en el suelo aparece como un trapecio — eso es una transformación proyectiva [25:55-26:06]. El ejercicio de la clase es trabajar solo en dos dimensiones, transformando un cuadrado en un trapecio [26:08-26:17].

Estimar la homografía a partir de puntos correspondientes [26:49-29:31]

El problema práctico: no se conocen analíticamente los valores de la matriz, pero se tienen puntos correspondientes en las dos imágenes [26:51-27:00]. El profesor pregunta cuántos puntos se necesitan [27:09-27:17]: para una transformación afín bastan 3 puntos; para una proyectiva (homografía) se necesitan 4 puntos [27:55-28:11, 41:06-41:12]. Con el mínimo de puntos la matriz se resuelve exacta, pero el resultado es muy sensible al error (un punto mal ubicado arruina todo) [29:07-29:11]. La forma robusta es tomar más de 6 puntos y buscar la matriz que minimice el error total [29:13-29:31].

Solución por mínimos cuadrados y SVD [29:58-40:24, 46:21-47:43]

Con más puntos que el mínimo, la matriz del sistema ya no es cuadrada y no se puede invertir [46:23-46:32, 40:00-40:02]. La solución es resolverlo como un problema de mínimos cuadrados: se buscan los valores (las X del sistema, con los B como datos de muestra) que minimizan el error cuadrático entre las coordenadas proyectadas y las observadas [46:48-47:13, 47:32-47:39]. Como no es fácil despejar la matriz, se usa la descomposición en valores singulares (SVD): la solución es el vector singular asociado al valor singular más pequeño [40:00-40:24, 47:14-47:28], y se puede demostrar que esa solución produce el mínimo error cuadrático [47:28-47:32].

Deformar la imagen (warping) e interpolación [43:23-45:48]

Una vez encontrada la matriz, se aplica a todas las coordenadas de una imagen para llevarla a la vista de la otra (overlay) y comparar [43:06-43:20]. Importante: se trabaja en 2D, con una transformación proyectiva de planos, por lo que no se considera la altura de los objetos: un objeto con altura proyectado con esa homografía no va a quedar bien [43:31-44:14]. Al deformar la imagen, los píxeles transformados pueden caer en coordenadas donde antes no existía un píxel, por lo que hay que remuestrear e interpolar: el usuario puede elegir el método (por ejemplo la interpolación cúbica u otra) [44:51-45:48]. [parte no entendida — el nombre exacto de los métodos de interpolación que mencionaba el profesor no se distingue en la grabación].

Aplicaciones: stitching y puntos característicos [40:30-43:20, 48:13-48:41]

La transformación proyectiva se usa en aplicaciones que hacen stitching (empalme) de imágenes: se encuentran puntos correspondientes en ambas, se calcula la matriz que mapea una en la otra y se sobreponen [42:11-43:20]. En esta etapa la selección de puntos es manual (hay una parte "selección de puntos" en el script de la práctica); la detección automática de puntos característicos es un tema posterior [41:50-42:09]. El profesor señala que esto ya es parte de la actividad de la clase y que luego se aplicará un poco más [48:13-48:35].

2 Puntos destacados / Lo que hay que saber

La relación objeto–foco–imagen en el modelo de cámara es de proporcionalidad (triángulos semejantes) [00:00-00:22].
Coordenadas homogéneas: agregar una coordenada extra (w = 1); para volver a cartesianas se divide entre w [02:22-02:53].
Las homogéneas son invariantes a escala: multiplicar todo por una constante da el mismo punto [04:05-04:12].
Gracias a las homogéneas, todo se convierte en multiplicación de matrices (las traslaciones dejan de ser sumas) [08:36-09:18].
Modelo pinhole: supone aspect ratio 1, centro óptico en (0,0), sin rotaciones ni desplazamientos [05:05-06:45].
La cámara completa tiene 5 parámetros intrínsecos y 6 extrínsecos (3 rotaciones + 3 traslaciones) [22:09-22:35].
Calibración: conocer los parámetros de la cámara analítica o experimentalmente (patrón con puntos conocidos) [23:55-24:11].
Una transformación proyectiva mapea planos entre dos vistas: un cuadrado visto de lado queda como un trapecio [25:55-26:06].
Homografía: requiere 4 puntos correspondientes (afín: 3 puntos) [27:55-28:11].
Con el mínimo de puntos el resultado es sensible al error; conviene tomar más de 6 puntos y minimizar el error [29:07-29:31].
La homografía se resuelve por mínimos cuadrados con SVD: la solución es el vector singular del valor singular más pequeño [40:00-40:24, 47:14-47:32].
La homografía no modela alturas: solo sirve para escenas planas; los objetos altos quedan mal [43:31-44:14].
Al deformar la imagen, los píxeles caen en lugares sin píxel: hace falta interpolación/remuestreo [44:51-45:48].
Usos: stitching de imágenes; la selección de puntos es manual por ahora (los característicos automáticos son tema posterior) [41:50-43:20].

3 Actividades y tareas pendientes

*[parte no entendida — no queda clara en la grabación la fecha de entrega ni si hay más tareas con fecha]

4 Dudas que podrían examinar

¿Qué son las coordenadas homogéneas?

Son la representación de un punto agregándole una coordenada extra (w, normalmente 1); para volver a cartesianas se divide entre w [02:22-02:53].

¿Por qué las coordenadas homogéneas son invariantes a escala?

Porque multiplicar todas las coordenadas por una constante representa el mismo punto; basta dividir entre la constante para recuperarlo [04:05-04:12].

¿Qué ventaja dan las coordenadas homogéneas?

Convierten las operaciones (incluidas las traslaciones) en multiplicaciones de matrices, sin sumas [08:36-09:18].

¿Cuántos parámetros tiene el modelo de cámara?

5 intrínsecos (foco/escala, sesgo, centro de la imagen…) y 6 extrínsecos (3 rotaciones + 3 traslaciones) [22:09-22:35].

¿Qué es una transformación proyectiva?

La que mapea un plano de una vista a otra; por ejemplo, un cuadrado visto de lado se convierte en un trapecio [25:55-26:06].

¿Cuántos puntos se necesitan para una homografía?

4 puntos correspondientes para una proyectiva; 3 para una afín [27:55-28:11].

¿Por qué se toman más de 6 puntos si bastan 4?

Porque con el mínimo el sistema es muy sensible al error de ubicación de los puntos; con más puntos se minimiza el error total [29:07-29:31].

¿Cómo se resuelve la homografía cuando hay muchos puntos?

Por mínimos cuadrados: se usa SVD y la solución es el vector singular asociado al valor singular más pequeño [40:00-40:24, 47:14-47:32].

¿Por qué un objeto con altura queda mal con una homografía?

Porque la homografía modela la transformación de un plano; no considera las alturas [43:31-44:14].

¿Por qué se necesita interpolación al deformar la imagen?

Porque los píxeles transformados caen en coordenadas donde antes no existía un píxel; hay que remuestrear [44:51-45:48].

5 Sitios o recursos para visitar

Modelo de cámara estenopeica (pinhole)
El modelo de cámara más simple y su geometría. · es.wikipedia.org
Coordenadas homogéneas
Por qué se agrega una coordenada y su invarianza a escala. · es.wikipedia.org
Homografía
Transformación proyectiva entre dos planos e imágenes. · es.wikipedia.org
Descomposición en valores singulares (SVD)
Método usado para resolver la homografía por mínimos cuadrados. · es.wikipedia.org
Direct Linear Transform (DLT)
Estimación de la homografía desde puntos correspondientes. · en.wikipedia.org
Image stitching (empalme de imágenes)
Aplicación de las transformaciones proyectivas para unir vistas. · es.wikipedia.org
Calibración de cámara
Estimación de los parámetros intrínsecos y extrínsecos. · en.wikipedia.org

6 Glosario de términos

  • Modelo de cámara pinhole (estenopeico): el modelo de cámara más simple; relaciona el mundo 3D con la imagen 2D por proporcionalidad.
  • Coordenadas homogéneas: representación de un punto con una coordenada extra (w); invariantes a escala.
  • Coordenadas cartesianas (reales): las coordenadas usuales (x, y); se recuperan dividiendo las homogéneas entre w.
  • Matriz intrínseca: parámetros propios de la cámara (focales, centro óptico, sesgo).
  • Matriz de rotación: orientación de la cámara en el mundo (3 ángulos), combinada en una matriz 3×3.
  • Parámetros extrínsecos: posición y orientación de la cámara (3 rotaciones + 3 traslaciones = 6 grados de libertad).
  • Calibración de cámara: estimar los parámetros de la cámara analítica o experimentalmente.
  • Transformación proyectiva (homografía): mapeo entre dos planos/vistas; matriz 3×3 con 8 grados de libertad efectivos.
  • Transformación afín: transformación lineal + traslación; requiere 3 puntos correspondientes.
  • Mínimos cuadrados: criterio para hallar la matriz que minimiza el error total entre puntos proyectados y observados.
  • SVD (descomposición en valores singulares): método para resolver la homografía; la solución es el vector singular del valor singular más pequeño.
  • Warping (deformación): aplicar la homografía a todos los píxeles de una imagen para llevarla a otra vista.
  • Interpolación / remuestreo: cálculo de valores de píxel en coordenadas donde no existía un píxel original.
  • Stitching: empalme de varias imágenes de la misma escena usando transformaciones proyectivas.
  • Puntos característicos (features): puntos distintivos de una imagen para correspondencias; su detección automática es un tema posterior.

7 Mapa mental textual

  • Modelo de cámara, coordenadas homogéneas y homografía · Clase 8
    • Modelo de cámara (pinhole)
      • Proporcionalidad objeto–foco–imagen (triángulos semejantes)
      • Suposiciones: aspect ratio 1, centro óptico en (0,0), sin rotación ni desplazamiento
      • Parámetros: 5 intrínsecos + 6 extrínsecos (3 rotaciones + 3 traslaciones)
      • Calibración y correcciones por lentes (angular, teleobjetivo)
    • Coordenadas homogéneas
      • Agregar coordenada w (w = 1)
      • Volver: dividir entre w
      • Invariantes a escala (multiplicar por constante = mismo punto)
      • Todo se vuelve multiplicación de matrices (adiós a las sumas)
    • Transformación proyectiva (homografía)
      • Mapea planos entre dos vistas; el cuadrado se vuelve trapecio
      • 4 puntos para proyectiva, 3 para afín
      • Estimación: más de 6 puntos, mínimos cuadrados y SVD (vector singular menor)
      • No modela alturas (solo escenas planas)
    • Warping e interpolación
      • Deformar toda la imagen con la matriz y sobreponer
      • Remuestrear por interpolación donde no había píxel
    • Aplicación
      • Stitching de imágenes
      • Selección manual de puntos (característicos automáticos: tema posterior)

Notas de estudio